Strategy/_archive/База данных научных статей.md
+

База данных научных статей

frozen🤖AI4S
next_stepДедлайн конец марта истёк — уточнить у Альберта статус scibase-стека на sBernoulli. При готовности: интегрировать с Silmaril viewer.
repohttps://github.com/art-int-4-science/scibase

База данных научных статей

Ресурсы


В рамках центра AI4Science мы строим мультиагентные системы для автономных исследований и ускорения научного поиска. У нас находятся в разработке системы написания литературного обзора по области исследований, системы поиска релевантных статей, агент автономного написания научных статей по теме, агент - писатель метаобзора научной области.
В ряде приложений мы сталкиваемся с проблемой доступа к научным статьям.
Ключевые препятствия:
- Системы противодействия скачиванию - cloudflare и другие защиты. Некоторые обходятся через selenium, некоторые нет.
- Региональные блокировки - для каких-то ссылок необходимо поднимать VPN.
- Paywall - некоторые статьи не находятся в открытом доступе.

Пользовательские сценарии

Здесь мы описываем типичные сценарии нашего использования, а не внешнего.
1. Поиск литературы для обзора. ИИ‑агент должен находить публикации по ключевым словам, DOI, авторам или областям, фильтровать по дате и типу публикации и быстро извлекать аннотацию и основные выводы.
2. Анализ цитирования и связей. Агенту нужен доступ к сетям цитирования и списку литературы каждой статьи, чтобы строить граф знаний и выявлять ключевые работы.
3. Доступ к полному тексту. Для глубокого анализа требуется полный текст и возможность обработки PDF, LaTeX или HTML.
4. Регулярное обновление базы. Новые статьи должны автоматически появляться в хранилище в соответствии с периодичностью источника (ежедневно для arXiv, PMC и др.).

Источники

Источник Описание Примерный Объём Форматы/Доступ Частота обновления Дополнительно
scihub База данных научных статей. Не обновляется с конца 2022 года, но содержит большое количество статей, вышедших до этого. Крайне полезный источник. 88 млн статей, ~100 ТБ документ + мета Не обновляется https://sci-hub.se/scimag/ здесь список на торрент со всем архивом
OpenAlex snapshot Поисковик научных статей. Важно, что в его снэпшоте содержится полный обновляемый каталог сервиса unpaywall 1.6 ТБ Ежемесячно https://docs.openalex.org/download-all-data/snapshot-data-format https://docs.openalex.org/download-all-data/openalex-snapshot
CrossRef Предоставляет метаданные (Dublin Core, JSON) по DOI; поддерживает открытые API. Последний снэпшот (март 2025) 197 Гб 2024 год - 212 ГБ 2023 год - 185 Гб 2022 год - 167 Гб 2021 год - 102 Гб JSON Ежегодно выкладываются снэпшоты Но апдейты по новым doi надо делать как минимум раз в неделю. Это и есть основной источник мета информации о новых статьях. https://www.crossref.org/learning/public-data-file/
OpenCitations Крупная открытая база цитирований doi2doi 2.2 миллиарда цитирований ~ 1 Тб Большие разреженные графы в простейшем случае есть csv, но есть и другие форматы Most recent OpenCitations Index data dump - July 2025 Released on 2025-07-10, this dataset adds the citation data contained in the Crossref dump dated March 2025 Key Statistics 2.2 Billion+ Citations (2,216,426,689) Download Files Type and format Archive Size Citation data (CSV) 242 GB (38.8 GB zipped) Citation data (N-Triple) 2.1 TB (87.4 GB zipped) Citation data (Scholix) 2.1 TB (45 GB zipped) Provenance data (CSV) 454 GB (20 GB zipped) Provenance data (N-Triple) 3.4 TB (105 GB zipped) Два раза в год выкладываются снэпшоты Но апдейты по новым doi надо делать как минимум раз в неделю. Это и есть основной источник о том, кто кого цитировал https://download.opencitations.net
arxiv Источник препринтов и исходных текстов большого количества научных статей в области Math и Computer Science Терабайты данных Миллионы статей Десятки тысяч новых статей каждый месяц Принимаются LaTeX и PDF; метаданные доступны через OAI‑PMH и API. RSS-ленты отправляются ежедневно Ежедневно (Допустимо еженедельно) Возможно сильное пересечение с HAL и dblp
PubMed Central Открытый архив биомедицинских статей NCBI. 11 млн статей Хранит полные тексты в формате XML/HTML; поиск осуществляется через Entrez; доступны PDF. (?) Ежедневно (Допустимо еженедельно) https://pmc.ncbi.nlm.nih.gov/tools/textmining/
HAL Французский национальный репозиторий. По состоянию на 2023 г. содержит миллионы документов, обеспечивая идентификаторы и версионность; более 1 млн документов доступны в открытом доступе Более 1 млн статей Поддерживает TEI/XML, PDF и другие форматы; предоставляет богатые метаданные через OAI‑PMH. Допустимо ежемесячно Возможно сильное пересечение с dblp и arxivами
dblp Немецкий аналог HAL Десятки тысяч статей ежемесячно. Всего около 8 миллионов статей Допустимо ежемесячно Возможно сильное пересечение с HAL и arxivами
biorxiv Био­медицинский репозиторий препринтов. В 2017 г. было принято 10 722 работ; в 2018 г. — около 20 000, в 2019 г. — 31 000 (2600–3000/мес.), в 2020–2022 гг. публикуется 36–40 000 пред­печатей ежегодно Принимаются PDF, DOCX и LaTeX; доступны файлы PDF и разметка; по желанию авторы публикуют ревизии. Ежедневно (Допустимо еженедельно)
Chemrxiv аналогично Ежедневно (Допустимо еженедельно)
PsyArXiv аналогично Ежедневно (Допустимо еженедельно)
Другие Нас очень интересуют другие источники научных статей за пейволом - все большие паблишеры (Elsevier, Wiley and American Chemical Society, Springer…) Мы знаем, что Ленинка как-то научилась предоставлять доступ к таким работам Ниже алгоритм, как это можно получить в индивидуальном порядке - если бы можно было организовать выкачку - это было бы супер: Российская Государственная Библиотека организовала доступ к международным базам данных и зарубежным статьям 🔥 Там есть все, что мы любим: Elsevier, ACS, Wiley, Springer и др. Для получения доступа нужно: 1. Зарегистрироваться на сайте РГБ, подвязать госуслуги и получить номер читательского билета; 2. Зарегистрироваться на портале MyLOFT, зайти через данные, полученные из РГБ и подождать 1-2 дня для одобрения. 3. Установить расширение MyLOFT в браузер (в приложении инструкция от РГБ). Сюда же можно отнести источники научных статей из libgen, anna’s archive #

Ссылка на инструкцию по сервису MyLoft

RSL_MyLoft_all

Требования к базе данных

Мы не большие специалисты по данным, поэтому какие-то комментарии/запросы могут быть неточными.
- Файлы: необходимо хранить оригинальные файлы статей в формате PDF; для статей, доступных в исходных форматах, сохранять также LaTeX, TeX, DOCX и HTML. Желательно сохранять текстовый слой (plain TXT) для быстрого поиска. Некоторые источники (PMC, HAL) предоставляют XML/TEI - их следует сохранять для точного разбора структуры.
- Парсинг метаданных и текста: Для связи со списком литературы используется Crossref и Semantic Scholar. Совсем в идеальном мире бесконечного компьюта было бы хорошо прогнать все статьи через docling для получения добротного markdown файла с таблицами. Однако, учитывая объём базы, допускаем, что это задача близка к невозможной. При этом, анализ графа цитирований был бы полезен для определения, допустим, десятка тысяч самых значимых статей в области по простейшему PageRank или другому способу определения важности и дальнейшего парсинга самых важных статей.
- Идентификаторы: каждая запись должна иметь DOI, арXiv ID, PMC ID, PMID, HAL ID и др. При отсутствии DOI следует генерировать внутренний UUID. Использовать ORCID для авторов и ROR для организаций.
- Доступ: хранилище должно позволять искать статьи по различным полям (DOI, title, author, год, ключевые слова, предметная область), выполнять полнотекстовый поиск и возвращать результаты в машиночитаемом виде (JSON/YAML).
- Версионность: поддерживать несколько версий одной статьи (например, препринт на архиве и опубликованную версию). Необходимо отмечать дату загрузки и дату последнего обновления. Для этого они могут иметь одинаковый doi, но разные даты и разые UUID
- Доступ API: предоставить REST/FastAPI для ИИ‑агента и внутренних сервисов. Поддерживать аутентификацию, ограничение скорости и журналирование запросов. Для сложного анализа текстов можно предоставлять выгрузки в формате JSON/CSV.

Предлагаемая схема данных

Поле Тип Описание
id UUID / SERIAL Внутренний идентификатор записи.
doi TEXT DOI статьи (если есть).
title TEXT Заголовок статьи.
abstract TEXT Аннотация (извлечённая из источника).
fulltext\_txt TEXT Извлечённый полный текст (plain).
fulltext\_pdf TEXT Путь/URI до PDF-файла в хранилище
alt\_ids JSON/JSONB Другие идентификаторы: arXiv ID, PMID, PMC ID, HAL ID, Semantic Scholar ID, Scopus ID и т.п.
source\_url TEXT Путь/URI до исходного файла (LaTeX, DOCX и т.д.). Например, если статья была скачана из arxiv/openAlex, то нужно оставлять публичную ссылку
authors JSON/JSONB Список авторов: имя, фамилия, ORCID, аффилиация.
year INTEGER Год публикации.
source\_db TEXT Откуда извлечена.
crossref\_metadata JSON/JSONB Просто копия метаданных из crossref для статьи с заданным doi (есть у многих статей), достаётся из датасета crossref Пример возвращаемого json: https://api.crossref.org/works/10.1134/s1064226919120118
type TEXT Статья/репорт/статья с конференции
n\_citations NUM Количество цитирований данной статьи (берется из OpenCitations)
journal TEXT Название журнала или репозитория.
volume TEXT Том (если применимо).
issue TEXT Номер выпуска.
pages TEXT Номера страниц.
submission\_date DATE Дата подачи/публикации.
update\_date DATE Дата последнего обновления метаданных.
license TEXT Тип лицензии (CC BY, CC BY-NC, авторское право, public domain).
source TEXT Источник (arXiv, PMC, Sci‑Hub и т.д.).
oa\_status BOOLEAN Открыт ли доступ (open access).
keywords TEXT[] Ключевые слова или темы.
categories TEXT[] Предметные области (например, cs.AI, bio).
language TEXT Язык оригинала.
fulltext\_html TEXT HTML представление (если доступно).
references JSON/JSONB Список ссылок (DOI, заголовки, авторы).
citation\_count INTEGER Количество цитирований (по данным Crossref/Semantic Scholar).
version INTEGER Версия записи.
notes JSON/JSONB Дополнительные комментарии/теги/метаинформация

Поля от первого до crossref\_metadata включительно - наиболее приоритетные.
Верхнеуровнево алгоритм выглядит как скачивание scihub + скачивание снэпшота OpenAlex + извлечение текста из статей (возможно, слишком дорого) + обогащение скачанных файлов с помощью CrossRef и OpenCitations (в первый раз это можно сделать скачав снэпшот, при последующих апдейтах можно просто запрашивать эту метаинформацию по API).
Отдельно стоит проработать вопрос с добычей тяжёлых данных с помощью РГБ.

2025-12-18
Нам нужно предъявить какой-нибудь скрипт, который по заданному doi

Например,
Вход:
https://doi.org/10.1134/S1064226919120118

Кто цитирует:
Pasted image 20251218151134.pngКого цитирует:

REFERENCES

  1. V. N. Vapnik, “An overview of statistical learning theory,” IEEE Trans. Neural Networks 10, 988−999 (1999).

    Article Google Scholar 

  2. A. Choromanska, M. Henaff, M. Mathieu, G. Ben Arous, and Y. LeCun, “The loss surfaces of multilayer networks,” in Artificial Intelligence and Statistics (Proc. 18th Int. Conf., AISTATS 2015, San Diego, California, USA, May 9−12, 2015) (AISTATS 2015), pp. 192−204 (2015).

  3. K. Kawaguchi, “Deep learning without poor local minima,” in Advances in neural information processing systems (NIPS, 2016), pp. 586−594.

  4. C. Zhang, S. Bengio, M. Hardt, B. Recht, and O. Vinyals, “Understanding deep learning requires rethinking generalization,” arXiv, Preprint arXiv:1611.03530 (2016).

  5. Laurent Dinh, Razvan Pascanu, Samy Bengio, and Yoshua Bengio, “Sharp minima can generalize for deep nets,” J. Machine Learning Res. (JMLR) 70, 1019−1028 (2017).

    Google Scholar 

  6. Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun, “Deep residual learning for image recognition,” in Proc. IEEE Conf. on Computer Vision and Pattern Recognition, Las Vegas, NV, USA, June 27–30,__2016 (IEEE, New York, 2016), pp. 770−778.

  7. Y. Le Cun, L. D Jackel, B. Boser, J. S. Denker, H. P. Graf, I. Guyon, D. Henderson, R. E. Howard, and W. Hubbard, “Handwritten digit recognition: Applications of neural network chips and automatic learning,” IEEE Commun. Mag. 27 (11), 41−46 (1989).

    Article Google Scholar 

  8. Ya. Le Cun and C. Cortes, MNIST Handwritten Digit Database (Modified Nat. Inst. of Standards and Technol., 2010).

    Google Scholar 

  9. H. Xiao, K. Rasul, and R. Vollgraf, Fashion-mnist: a Novel Image Dataset for Benchmarking Machine Learning Algorithms arXiv Preprint arXiv:1708.07747 (2017).

  10. A. Krizhevsky and G. Hinton., “Learning multiple layers of features from tiny images,” Tech. Report, Citeseer (2009).

    Google Scholar 

  11. A. Paszke, S. Gross, S. Chintala, G. Chanan, E. Yang, Z. DeVito, Z. Lin, A. Desmaison, L. Antiga, and A. Lerer, “Automatic differentiation in PyTorch,” in NIPS 2017 Workshop on Autodiff, Long Beach, California, USA, Dec. 7,__2017.

  12. D. P. Kingma and J. Ba. Adam, “A method for stochastic optimization,” arXiv Preprint arXiv:1412.6980 (2014).

  13. H. Robbins and S. Monro, “A stochastic approximation method,” Ann. Math. Statist., 400−407 (1951).

  14. X. Glorot and Y. Bengio, “Understanding the difficulty of training deep feedforward neural networks,” in Proc. 13th Int. Conf. on Artificial Intelligence and Statistics, Sardinia, Italy, May 1315,__2010, (AISTATS, 2010), pp. 249−256.

  15. E. D. Sontag, “Vc dimension of neural networks,” NATO ASI Series F Computer and Systems Sci. 168, 69−96 (1998).

Альберту разбанили учетку, но на ней всё пусто, надо получить базовый доступ.
Надо доебаться достучаться до GigaEye!!!

  • Перенсём код в тиму на гитхабе новелти чекер, релепепер, scientific deepresearch, datachat
  • Альберт нашёл несколько вариантов ui pandas ai

2025-12-19
Демо
Pasted image 20251219160535.png - описание доступно под девайсовским ВПН

они пытаются вынуть OCRом из пдфок

Pasted image 20251219161835.png

Pasted image 20251219162129.png - достаточно указать общий путь, чтобы прочитать все паркеты

Pasted image 20251219162310.png - можно получить пдфку для киберленинки

архив = t-30, его докачивают

Pasted image 20251219162607.png - приме архива

Команда Сережи Волкова занимается прикладным уровнем

Команда поиска - другие ребята

Надо переходить к кастомной быстрой сборке

https://github.com/HocfaiSun/SciHubDownloader
https://github.com/Tishacy/SciDownl

Вот это очень крутой проект, надо его использовать для данных из других источников

💅 Выкладываю Arxiv at Home: Семантический поиск по статьям на своем железе 

Стандартный поиск arXiv — это танец с бубном. Semantic Scholar иногда ищет не то, что хочешь. SerpAPI по Google Scholar платный.

Поэтому я за выходной собрал Arxiv at Home — open-source движок для семантического поиска статей, который можно развернуть локально

По фичам:

  • Гибридный поиск: Retrieval Stage из эмбеддингов и BM25, сверху нейронный реранкинг.

  • Citation Boosting: Формула ранжирования учитывает не только смысл, но и импакт статьи. Сейчас для получения цитат используется бесплатный Batch API Semantic Scholar.

  • Инкрементальные обновления: Умная синхронизация, тянет только новые статьи, не обрабатывая весь датасет заново.

  • Оффлайн-режим: Всё локально, кроме цитат. Цитаты можно отключить в конфиге.

Кстати, сама API-шка stateless и хорошо скейлится горизонтально, а для стораджа используется PostgreSQL и QDrant - по идее, эту штуку можно развернуть примерно где угодно.

Код и инструкция по запуску на GitHub:

🔗 github.com/mrapplexz/arxiv-at-home

обогащаем с помощью

https://www.sci-hub.in/database
https://annas-archive.li/torrents/scihub

2026-02-19Сделал первый прототип

Оценка стоимости аренды железки на cloud.ru

SciBase: План прогрессивного развёртывания на Cloud.ru

Дата: 2026-02-19
Принцип: Парето — 80% ценности при 20% затрат на старте, наращивание постепенно.


Оптимизации стоимости

1. PDF → Ice class S3 (самый дешёвый)

PDF-файлы — write once, read rarely. Ice class на cloud.ru: 0.49 ₽/ГБ/мес (в 3.7× дешевле Standard). Ограничения Ice: дороже операции чтения (0.055 ₽ за 1000 GET vs 0.033 ₽), но для базы научных статей это некритично — читают единичные PDF, а не делают массовые scan.

2. Начинать с маленькой VM, расти по мере данных

С 5M записей в PostgreSQL не нужны 128 GB RAM. 32 GB хватит до ~50M записей. Экономия ~29 000 ₽/мес на старте.

3. Гибридный seeding: Hetzner для торрентов

Самая большая ловушка cloud.ru — цена дисков (~11.4 ₽/ГБ/мес). 4 TB SSD буфер для торрентов = 45 600 ₽/мес только за диск. Hetzner AX52 с 4 TB NVMe = €80 = ~8 000 ₽/мес (диски включены). Скачиваем торренты на Hetzner → заливаем в cloud.ru S3 Ice → удаляем.

4. Приоритизация данных по ценности

Для команды AI4Science в Сбере 80% ценности — это:
- CS, Physics, Math, Bio (arXiv покрывает это почти целиком)
- Свежие статьи (последние 5-10 лет)
- Высокоцитируемые работы

Sci-Hub (88M статей, 100 ТБ) — это длинный хвост. Из него ~20% действительно нужны для AI4Science.

5. BM25 first, семантика потом

BM25 (keyword search) даёт ~70-80% качества поиска и не требует Qdrant/GPU/эмбеддингов. Qdrant с 250M эмбеддингами съест ~500 ГБ NVMe (= 5 700 ₽/мес за диск). Добавляем на Phase 3.

6. Рост S3 пропорционален загрузке

Не платим за 120 ТБ с первого дня. Ice class = pay-as-you-go.


Phase 1: «Рабочий поиск» (Недели 1-4)

Цель: Поиск по 30-50M статей + PDF для arXiv/PMC через OA.

Что загружаем

Источник Объём данных Объём PDF Время загрузки
OpenAlex metadata (subset: CS, Physics, Math, Bio) ~80 ГБ → ~30-50M записей в PG 2-3 дня
arXiv bulk (последние 5 лет) метаданные в PG ~2-3 ТБ PDF 3-5 дней (S3 requester pays)
PMC OA (биомед) метаданные в PG ~200-500 ГБ PDF 3-5 дней (FTP)

Что работает

  • POST /search (BM25 по title + abstract) — < 500 мс
  • GET /paper/doi/{doi} — PDF из S3 или Unpaywall fallback (~50% покрытие)
  • GET /stats, /health
  • MCP для Claude

Инфраструктура

Компонент Конфигурация Цена/мес
VM (Compute) 16 vCPU / 32 GB RAM 17 350 ₽
Диск SSD 500 ГБ (PG ~200 ГБ + индексы + OS) 5 700 ₽
S3 Ice ~3 ТБ (arXiv + PMC PDFs) 1 470 ₽
Public IP 1 шт 146 ₽
Итого ~24 700 ₽/мес (~250$)

Ценность: Команда уже может искать статьи. 80% рабочих запросов покрыты.


Phase 2: «Полные метаданные + цитирования» (Месяцы 2-3)

Цель: Вся мировая наука в метаданных (250M), граф цитирований, больше PDF.

Что загружаем

Источник Объём Время
OpenAlex (полный snapshot) 330 ГБ compressed → 250M записей 1 неделя (загрузка + импорт)
CrossRef enrichment ~200 ГБ 3-5 дней (API)
OpenCitations 39 ГБ zip → 2 млрд связей 2-3 дня
arXiv bulk (полный, все годы) ~9 ТБ PDF 1-2 недели

Что нового

  • Поиск по 250M статей (вся мировая наука)
  • Citation boost в ранжировании
  • GET /citations/{doi} — граф цитирований
  • Покрытие PDF: arXiv полный + PMC + Unpaywall ≈ ~15-20% локально + ~30% OA

Инфраструктура (апгрейд)

Компонент Конфигурация Цена/мес
VM (Compute) 32 vCPU / 128 GB RAM (для 250M PG) 46 600 ₽
Диск SSD 2 ТБ (PG ~800 ГБ + цитирования + индексы) 22 800 ₽
S3 Ice ~12 ТБ (arXiv полный + PMC) 5 880 ₽
Public IP 1 шт 146 ₽
Итого ~75 400 ₽/мес (~750$)

Phase 3: «Семантический поиск + начало Sci-Hub» (Месяцы 4-6)

Цель: Поиск по смыслу (embeddings), начать наращивать покрытие PDF через торренты.

Что загружаем

Источник Объём Время
Эмбеддинги 250M статей (all-MiniLM-L6-v2) ~400 ГБ в Qdrant 2-3 недели (CPU)
Sci-Hub торренты (приоритет: CS, Physics, Math, Medicine) ~20-30 ТБ PDF (20-25M статей) 2-3 месяца фоном

Что нового

  • mode: "semantic" и mode: "hybrid" — поиск по смыслу
  • Cross-encoder reranking
  • Покрытие PDF: ~40-50% (локально + OA)

Инфраструктура

Компонент Конфигурация Цена/мес
VM (Compute) 32 vCPU / 128 GB RAM 46 600 ₽
Диск SSD 3 ТБ (PG + Qdrant ~500 ГБ) 34 200 ₽
S3 Ice ~25-35 ТБ (растёт по мере загрузки) 12 250 - 17 150 ₽
Seed (Hetzner AX52) 8C/64GB/4TB NVMe — торренты → S3 ~8 000 ₽ (€80)
Public IP 1 шт 146 ₽
Итого ~101 000 - 106 000 ₽/мес (~1 050$)

Phase 4: «Полное покрытие» (Месяцы 7-12)

Цель: Доскачать Sci-Hub, автообновления, production-ready.

Что загружаем

Источник Объём Время
Sci-Hub торренты (оставшиеся) ещё ~60-70 ТБ 4-6 месяцев фоном
Автообновления: arXiv ежедневно, PMC еженедельно, OpenAlex ежемесячно ~2-5 ГБ/день непрерывно

Что нового

  • Покрытие PDF: ~80-90%
  • Мониторинг (Prometheus + Grafana)
  • Автоперезапуск, health-checks
  • Production SLA

Инфраструктура

Компонент Конфигурация Цена/мес
VM (Compute) 32 vCPU / 128 GB RAM 46 600 ₽
Диск SSD 3 ТБ 34 200 ₽
S3 Ice 80-120 ТБ 39 200 - 58 800 ₽
Seed (Hetzner) до завершения загрузки, потом выключить 8 000 ₽ → 0
Итого (рост S3) ~120 000 - 140 000 ₽/мес
После загрузки всего без Seed, S3 = 120 ТБ ~140 000 ₽/мес (~1 400$)

Сводка по бюджету

Фаза Период Стоимость/мес Кумулятивно Что имеем
1 Мес. 1 ~25 000 ₽ 25 000 ₽ BM25 поиск, 50M статей, arXiv PDF
2 Мес. 2-3 ~75 000 ₽ 175 000 ₽ 250M метаданных, цитирования, 12 ТБ PDF
3 Мес. 4-6 ~105 000 ₽ 490 000 ₽ Семантический поиск, 35 ТБ PDF
4 Мес. 7-12 ~130 000 ₽ 1 270 000 ₽ 90%+ покрытие, 100+ ТБ PDF
Cruise Мес. 13+ ~140 000 ₽ +140K/мес Полная база, автообновления

Суммарно за первый год: ~1.3 млн ₽ (~13 000$)

Источники цен (актуальны на 01.01.2026)

2026-02-23
Текущий статус инфраструктуры: уже запущен торрент SciHub архива, PostgreSQL, FastAPI. Embeddings залиты. Следующий шаг — написать план развертывания и обсудить с Альбертом.

2026-03-29

Пока поставили на паузу, потому что можно кое как парсить сайхаб

Choose icon